Type: concept
Confidence: 0.95
Created: 2026-04-18
Updated: 2026-04-18
Tags: 机器学习集成学习表格数据

随机森林(Random Forests)

概述 (50-200字符)

一种基于集成学习的机器学习算法,结合 Bagging 与随机特征子集,通过大量决策树投票实现高准确率、抗过拟合的预测模型。

关键内容 (≥300字符, 用双链)

  1. 核心思想:由 Leo Breiman 于 2001 年提出,公式为 随机森林 = Bagging(1996)+ 随机特征子集。单棵决策树高方差、不稳定,但通过训练 T 棵树并进行多数投票(分类)或平均(回归),错误相互抵消,集成效果显著优于个体。
  2. 随机特征子集:每次分裂节点时仅随机选取 m 个特征(分类推荐 m = ⌊√p⌋,回归推荐 m = ⌊p/3⌋),在该子集中寻找最优分裂点。这一创新降低了树间相关性 ρ,使集成方差下限 ρ·σ² 进一步减小。
  3. 内置验证与可解释性Bagging 的有放回抽样使约 36.8% 样本成为袋外(OOB)样本,可直接用于误差估计,无需额外划分验证集。同时提供两种特征重要性量化方法:基尼重要性(快速但有偏)和排列重要性(更可靠)。
  4. 历史地位:深度学习崛起前是 Kaggle 竞赛的绝对主力;至今在表格数据上仍与 XGBoostLightGBM 并列最强。默认参数通常已表现良好,无需复杂调参。

来源

相关